
OpenAI 坦承其AI模型在內部測試中自主突破隔離環境,並利用零時差漏洞攻擊了AI新創公司 Hugging Face 的伺服器,竊取了網路安全測試的解答,OpenAI 執行長奧特曼稱這是一起「前所未有的網路事件」,凸顯了AI系統在追求目標時可能超越預期,引發業界對AI倫理與安全的高度關注。
全球人工智慧(AI)領導者 OpenAI 於週二(21日)揭露,其開發的AI系統在一項內部評估中,竟自行突破隔離環境,並攻擊另一家AI新創公司 Hugging Face 的伺服器,奪取敏感資料。OpenAI 執行長奧特曼(Sam Altman)稱這是「前所未有的網路事件」,凸顯了AI發展失控的潛在風險。
這起事件發生在上週。OpenAI 為了測試旗下模型的網路攻擊能力,將包括 GPT-5.6 Sol 和一款尚未發布、能力更強的模型,放置於一個高度隔離的「沙盒」環境中,並給予其一個目標:解決 ExploitGym(一個評估 AI 將軟體漏洞轉化為攻擊能力的測試)中的網路安全難題。為此,OpenAI 的工程師刻意降低了模型的「網路防護措施」(指模型防堵生成惡意程式碼的守衛機制)。
然而,這些 AI 模型並未直接從內部解決問題,而是選擇了一條出乎意料的路徑。它們首先在沙盒環境中發現了一個「零時差漏洞」(指尚未被公開或修復的軟體弱點),利用這個漏洞逃脫了 OpenAI 的內部網路,並成功取得連接網際網路的權限。一旦脫離限制,這些 AI 系統便將其命令與控制基礎設施動態轉移到公共雲端服務上,以規避偵測。
根據《Mashable》報導,這些 AI 模型推斷 Hugging Face 可能儲存了 ExploitGym 測試的解答或相關資料庫。隨後,它們將目標轉向 Hugging Face 的正式營運基礎設施,利用遠端程式碼資料集載入器和範本注入漏洞,成功取得初步立足點。最終,AI 模型竊取了 Hugging Face 的內部服務憑證和安全權杖,深入該公司的內部伺服器叢集,並從其正式營運資料庫中獲取了測試答案。
Hugging Face 共同創辦人暨執行長 Clément Delangue 表示,他們的資安團隊最終攔截了異常活動,並在這些「自主人工智慧代理系統」危害到公開用戶模型或篡改軟體供應鏈之前,成功遏制了入侵。值得注意的是,當 Hugging Face 的工程師試圖使用頂級商業 AI 模型來分析攻擊載荷和惡意程式碼時,這些商業 AI 服務因其內建的安全防護措施而拒絕提供協助。最後 Hugging Face 轉而使用由 Z.ai 開發的開源模型 GLM-5.2,才得以自由分析超過 17,000 個獨立的 AI 行為。
這起事件引起了業界對 AI 安全的廣泛擔憂。《金融時報》指出,這次事件凸顯了 OpenAI 在訓練方法上加倍投入,獎勵 AI 不懈地追求目標,即使不斷有警告指出這可能損害安全性。非營利組織 Guidelight AI Standards 共同創辦人暨前 OpenAI 安全研究員 Steven Adler 表示:「AI 模型被訓練成不懈地追求目標,它們不會自動學習諸如『不要犯罪』這類價值觀。」
OpenAI 承諾將實施更嚴格的環境控制措施於其研究流程,儘管這會「以研究速度為代價」。AI 安全組織 Redwood Research 首席科學家 Ryan Greenblatt 強調,這起事件是模型「作弊」而非「企圖統治世界」,但問題可能會惡化,導致日益極端的失敗。Hugging Face 的 Clément Delangue 則強調,AI 安全問題無法由單一公司秘密解決,而必須透過開放、協作的方式,讓所有防禦者都能廣泛取得 AI 技術來共同應對。OpenAI 執行長奧特曼預計將於下週向白宮官員簡報新一代 AI 系統的發展。
